메뉴

#비용 효율

HN
Hacker News • 23일 전
IMP 7

동일 모델, 하네스별 비용 최대 17배 차이 벤치마크

해커뉴스에 공개된 FrontierHarness Eval은 동일한 모델로 9개 에이전트 하네스를 비교해 통과율, 비용, 속도를 측정했습니다. 그 결과 하네스 선택에 따라 과제당 비용이 최대 17배(Exo Harness $1.05 vs Claude Code $18.34)까지 차이났으며, 최고 통과율은 Codex(66.7%), 최고 비용효율은 Pi(60.0%·$2.43)로 나타났습니다. 코딩 에이전트 성능이 모델만이 아니라 하네스 설계에도 크게 좌우됨을 보여주는 의미 있는 벤치마크입니다.

벤치마크 코딩 에이전트 에이전트 하네스
HN
Hacker News • 24일 전
IMP 6

LLM 지능 대비 비용 그래프의 오해와 진짜 비교

OpenTeams 엔지니어가 ArtificialAnalysis의 '지능 vs 비용' 그래프가 로그 스케일 사용, 공식 API 가격만 반영, 로컬 모델의 데이터센터 가격 표기 등으로 실제 비용 차이를 왜곡한다고 지적합니다. 저자는 선형 스케일과 실제 최저 임대 가격, 로컬 실행 전기요금을 반영한 자체 그래프를 공유하며, 단순 작업에 비싼 모델을 쓰는 것은 낭비임을 강조합니다.

LLM 벤치마크 비용 효율 ArtificialAnalysis
HN
Hacker News • 33일 전
IMP 8

GLM-5.3, 오픈 웨이트 모델이 Anthropic·OpenAI 제치고 1/5 비용으로 1위

실무 과제 28개 기반 리더보드에서 오픈 웨이트 모델인 GLM-5.3이 코딩·데이터·실전·보안·툴 사용 등 5개 영역 모두 100% 통과율을 기록하며 최상위에 올랐습니다. 한 바퀴(랩)당 비용이 $0.28로 gpt-5.5($1.43)의 약 1/5 수준이며, 유일한 단점은 첫 토큰 지연시간(16.3초)입니다. 반면 fable-5는 28개 과제 중 5개를 거부해 79%로 공동 최하위에 그쳤습니다.

GLM 오픈소스 리더보드
GB
Google AI Blog • 178일 전
IMP 7

구글, 가장 가성비 좋은 영상 생성 모델 Veo 3.1 Lite 공개

구글 딥마인드가 기존 모델 대비 절반 미만의 비용으로 동일한 속도를 제공하는 새로운 영상 생성 모델 'Veo 3.1 Lite'를 출시했습니다. 이 모델은 텍스트/이미지를 영상으로 변환하는 기능을 지원하며 720p 및 1080p 해상도와 최대 8초 길이 등 유연한 설정을 제공합니다. 4월 7일부터는 기존 'Veo 3.1 Fast' 모델의 가격도 인하되어 개발자들이 더욱 저렴하게 영상 생성 API를 제품에 통합할 수 있게 되었습니다.

영상 생성 Veo 3.1 Gemini API